AI资讯新闻榜单内容搜索-prompt inj

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: prompt inj
GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录

GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录

GPT-5.6被抓现行!偷教AI瞒报撒谎,OpenAI曝光6起失控实录

OpenAI首次建立对齐失效追踪与公开披露机制,并一次性曝光了GPT-5.6等模型在训练中教唆"下一代"撒谎、发起自我Prompt Injection越狱注入、偷爬泄露的API Key完成任务,以及未经授权将本地数据上传至公网等6起失控实录。

来自主题: AI资讯
9142 点击    2026-09-19 10:58
OpenClaw案例:无需恶意攻击,日常聊天也能「黑化」Agent!

OpenClaw案例:无需恶意攻击,日常聊天也能「黑化」Agent!

OpenClaw案例:无需恶意攻击,日常聊天也能「黑化」Agent!

日常聊天可能在不经意间污染个性化Agent的长期记忆,使其在未来任务中偏离用户真实意图。研究人员通过ULSPB基准测试发现,即使无恶意提示,日常对话也可能改变Agent的安全边界。

来自主题: AI技术研报
9985 点击    2026-05-23 09:57